-
ViVa 论文精读:让视频生成模型成为机器人价值函数精读 ViVa:把 Wan2.2 的时空生成先验改造成价值模型,同时预测未来本体状态与任务回报,并接入 RECAP 改善长时程机器人强化学习。
14 min read -
GR-RL:面向长时域灵巧精密操作的强化学习专精化精读 ByteDance Seed 的 GR-RL:用分布式 critic 学习任务进度、过滤次优示范,再通过形态对称增强和 latent-space online RL,让 VLA 学会多眼孔鞋带穿线。
17 min read -
π*₀.₆ 与 RECAP 论文精读:让 VLA 从真实经验中变强精读 Physical Intelligence 的 RECAP:用分布式 value function 估计 advantage,再以 advantage conditioning 从示教、自治轨迹和人工干预中迭代改进 VLA。
23 min read